1
范式转变:从任务专用模型到大语言模型
PolyU COMP5511Lecture 10
00:00

NLP 的演变:从碎片化 AI 到基础模型

定义

  • 碎片化 AI:一个由离散、专用的神经架构所定义的时代,这些架构针对序列标注或分类等单一任务而设计。
  • 基础模型:一种统一、单体式的 Transformer 架构,将所有语言问题视为生成式文本到文本序列 $x \rightarrow y$。

核心概念

  • 架构整合: 历史上,NLP 需要定制的流水线(用于 NER 的 Bi-LSTM、用于情感分析的 CNN)。LLM 将这些孤岛合并为单一主干,其中相同的权重用于每一项任务。
  • 统一接口: LLM 用自然语言接口取代了专用的"输出头"(例如 3 类 Softmax)。输入和输出始终是字符串,使模型能够理解 意图 而非 格式
  • 知识迁移: 传统模型对每项任务都是"白板"。LLM 优先考虑 泛化优先,其中特定任务仅是预先存在的、稳健的内部语言表征的应用而已。

历史背景

  • 2018 年之前: 任务隔离需要使用不同的损失函数 $\mathcal{L}_{task}$ 训练不同的模型。
  • 现代时期: "文本到文本"范式允许单一模型(例如 Llama-3)通过零样本或少样本提示在不同任务间切换。
传统 AI$f_{NER}(x) \rightarrow y_{labels}$$f_{Sent}(x) \rightarrow y_{class}$$f_{Trans}(x) \rightarrow y_{seq}$基础模型时代提示 + $x$LLM$f(p, x) \rightarrow y_{str}$字符串 $y$
Python 实现对比